О корпусе
Нивхский язык — уникальный язык-изолят, ареально отнесенный к палеоазиатской группе и распространенный в низовьях Амура и на Сахалине. На данный момент количество людей, считающих себя нивхами, составляет примерно 4,5 тысячи человек. Корпус создавался нами с целью сохранения языковых данных в цифровом виде и будет полезен для лингвистов-исследователей, а также для всех, кто хочет изучать нивхский язык.
На текущий момент корпус включает 25 текстов разных авторов, составляющих 1251 предложение с суммарным количеством слов, превышающим 8 т. словоформ. В корпусе представлены тексты на амурском, сахалинском и шмидтовском диалектах, 14, 9 и 2 текстов соответственно. Кроме того, тексты относятся к разным жанрам, что обеспечивает репрезентативность корпуса.
Как пользоваться корпусом
Поисковой механизм корпуса поддерживает поиск по леммам и словоформам как на нивхском, так и на русском. Для нивхских слов полностью поддерживается дополнительный поиск по различным грамматическим признакам; в случае русского языка для словоформ поиск происходит с помощью регулярного выражения по русскому переводу.
Для удобства пользованием корпусом аннотация была осуществлена в структуре Universal Dependencies (UD). Глоссирование текстов реализовано также по общепринятым стандартам разметки — Лейпцигской системе правил глоссирования. Тексты снабжены следующей разметкой:
- POS — часть речи слова
- Case — падеж слова (для имен существительных)
- NounType — тип имени существительного
- Clusivity — инклюзивное или эксклюзивное прочтение (для местоимений)
- VerbForm — тип глагола
- Tense — время глагола
- Mood — наклонение глагола
- Aspect — аспект глагола
- Number — число
- Person (main word) — лицо главного слова
- Person (object / possessor) — лицо объекта или посессора
- Clitic — клитики
- Coordination — сочинение
- Miscellaneous — дополнительные признаки
Поиск поддерживает до 10 слов в одном запросе, а также снабжен виртуальной клавиатурой для особых знаков в нивхской письменности.
Список сокращений
Группа признаков POS (части речи)
ADV — наречие, CLASS — классификатор, DISC — дискурсивные частицы, NOUN — существительные, NUM — числительные, PRON — местоимения, PROPN — имена собственные, Q — квантор, VERB — глагол.
Группа признаков Case (падеж)
Abl — аблатив, Abs — абсолютив, Cau — падеж каузи, Cmp — компаратив, Com — комитатив, Dat — датив, Ins — инструменталис, Lim — лимитатив, Loc — локатив, Per — перлатив, Rep — репортатив, Voc — вокатив.
Группа признаков NounType (тип номинализации)
Agent — агентивная, Locat — локативная, Proc — процесс, Instr — инструментальная.
Группа признаков Clusivity (инклюзивность)
Ex — эксклюзивный, In — инклюзивный.
Группа признаков VerbForm (тип нефинитной формы)
Conv — конверб, Part — причастие.
Группа признаков Tense (время)
Fut — будущее, Non-Fut — настояще-прошедшее время.
Группа признаков Mood (наклонение)
Cnd — условное, Conces — уступительное, Des — дезидератив, Hort — гортатив, Imp — императив, Ind — индикатив, Indir — косвенная речь, Jus — юссив, Prob — пробабилитив, Proh — прохибитив.
Группа признаков Aspect (вид)
Prog — прогрессив, Ant — предшествование, Iter — повторяемость, Usit — узитатив, Compl — комплетив, Sim — одновременность, Avert — авертив.
Группа признаков Person, word / obj / pos (лицо самой словоформы, объектной и посессивной клитики)
1 — первое лицо, 2 — второе лицо, 3 — третье лицо.
Группа признаков Number (число словоформы)
Sing — единственное число, Plur — множественное число.
Группа признаков Coordination (сочинение)
VCoord — глагольное сочинение, NCoord — именное сочинение.
Отдельные признаки
Aux — вспомогательный глагол, Caus — каузатив, Collective num — собирательные числительные, Emphatic — эмфаза, Evid — эвиденциальность, Focus — фокус, Negation — отрицание, Indefinite — неопределенность, Question — вопрос.
Группа признаков Clitic (клитики)
Obj — объект, Pos — посессор, Reciprocal — реципрок, Reflex — рефлексив.
Участники проекта
Д. В. Савина
разработка сайта, автоматическое глоссирование, разбор текстов
Е. Н. Гогуа
обработка данных, разбор текстов
Э. Х. Измайлова
автоматические глоссирование и перевод, разбор текстов
П. В. Гращенков
прототипирование, планирование, разбор текстов, руководство
Благодарности
Исследование выполнено сотрудниками лаборатории автоматизированных лексикографических систем НИВЦ МГУ при поддержке гранта РНФ № 25-28-00552 «Цифровизация данных исчезающего языка: нивхский», реализуемого в МГУ имени М.В. Ломоносова.
Мы чрезвычайно признательны нашим друзьям и партнерам из библиотеки Ноглик за регулярную помощь с поиском данных. Мы также признательны Хидетоши Шираиши за собранный им нивхский материал, который частично был размечен и включен нами в данную коллекцию.
Создатели первого нивхского корпуса, В. Ю. Гусев и Р. И. Идрисов также поделились с нами текстовыми данными, что помогло нам ускорить свою работу (размеченные части двух корпусов при этом не пересекаются).
Мы благодарим Е. Ю. Груздеву, на которую мы старались равняться в наших занятиях нивхским и работы которой помогали нам на пройденном пути! Стоит упомянуть также и всех наших предшественников-классиков нивхологии: Л. Я. Штернберга, Е. А. Крейновича, В. З. Панфилова, В. П. Недялкова, Г. А. Отаину и многих других.
Отдельное спасибо нашим техническим консультантам, С. Аверкиеву и А. Губанову!
Особая благодарность должна быть высказана людям, которые принимали посильное участие на разных этапах сбора данных, анализа литературы и т.д., прежде всего это С. Шевелев и М. Гринчевский. Мы также признательны всем посетителям нивхского спецкурса МГУ последних трех лет. Большое спасибо всем студентам, кто помогал нам с разбором текстов и разметкой данных: Л. Зайцеву, М. Медведевой, В. Слабожаниновой и многим другим!